Skip to main content

Agent 训练环境

Agent 训练环境是 agentic RL 训练时给模型「练手」的那台机器。它不吃 GPU,但几千张 GPU 有没有活干,取决于它能不能按需、快速、可重置地供给出几万个隔离环境。

先约定几个词,本专题全程使用:

意思
RL(强化学习)让模型通过「试—打分—调整」学习的训练方式。没有标准答案,只有一个给行为打分的函数
rollout一次完整的「让模型去试一遍」。模型在环境里连续动作若干步直到结束,产出一条轨迹
环境接收动作、返回观察和奖励的那个东西。对 Agent 来说通常就是一台装好工具的 Linux 机器
reset把环境恢复到初始状态,好让下一次 rollout 从同一个起点开始。这是训练环境区别于运行时沙箱最核心的一条
可验证奖励(RLVR)由程序自动判定的奖励,比如「测试跑没跑过」。它是编码任务成为 agentic RL 主战场的原因
快照与 fork把初始状态固化下来,每条 rollout 从它分叉出一个独立副本。这是 reset 的高效实现方式
harness(脚手架)真正驱动模型干活的那个程序,比如 Claude Code、Codex。训练时用的和上线时用的是不是同一份,直接决定训练效果能不能复现

一、这一层要解决的问题

四个要求,缺一条这层就不成立① 并发要够一轮 rollout 同时要几万到几十万个环境而且是阶跃式的② 起停要快单个环境可能只活 30 秒冷启动 2 秒就是 6% 浪费再乘以几十万次③ 要能 reset每条 rollout 必须从同一个起点出发否则奖励没法互相比较④ 要可复现这一轮和上一轮的环境必须一致否则分数变化没法归因生产用的运行时沙箱四条里只满足前两条的弱化版,后两条根本没有对应概念 —— 这就是为什么训练要另做一套。而这四条互相拉扯:并发越高越难保证一致,起停越快通常意味着共享越多、隔离越弱。本专题就是沿这四条展开的:01 讲为什么,02 讲一个实现,03 与 04 讲怎么接进训练,05 讲用什么任务训。
把这四条当成检查表:评估任何一个环境方案时,逐条问它做到了哪一步、代价是什么。

二、五篇正文

#标题回答的问题
01训练环境为什么不是运行时沙箱生产上已经有沙箱了,为什么还要另做一套?差在哪、差多少
02AgentENV 拆解一个支撑 150 万镜像、冷启动 50 毫秒的实现内部长什么样
03环境接口标准训练框架和环境用什么接口对话?三套方案划在了哪里
04训练框架怎么接环境谁负责把几万个环境拉起来?六个训练框架的选择
05任务环境与选型用什么任务训?评测基准能不能直接拿来用

三、拆解对象

3.1 环境平台

项目协议语言选取理由
kvcache-ai/AgentENV3,240MITRust本专题主拆对象。给 Kimi K3 的 agentic RL 训练供环境,是少数有前沿模型生产验证的开源实现
e2b-dev/E2B13,478Apache-2.0Python这个领域事实上的 API 参考,AgentENV 选择兼容它。运行时形态的拆解见 执行沙箱 03 篇

3.2 环境接口标准

项目协议建仓立场
huggingface/OpenEnv2,509BSD-3-Clause2025-10-01把 Gymnasium 的 reset / step / state 搬到 HTTP 上,环境用 Docker 打包
PrimeIntellect-ai/verifiers4,525MIT2025-01-22接口单位是一整条轨迹:taskset / harness / trace,工具以 MCP 装进 harness

3.3 训练框架

项目协议建仓环境接入方式
verl-project/verl23,040Apache-2.02024-10-31多轮工具调用与 agent loop 内建
microsoft/agent-lightning17,525MIT2025-06-18在模型 API 层代理,agent 代码零改动;用 K8s Job 拉起
OpenPipe/ART10,603Apache-2.02025-03-10面向给已有 agent 做在岗训练
alibaba/ROLL3,365Apache-2.02025-05-28Ray 多角色分布式,异构任务调度
NovaSky-AI/SkyRL2,176Apache-2.02025-04-22分三层:训练 / 环境库 / 长程 agent 层
PrimeIntellect-ai/prime-rl1,952Apache-2.02025-02-18与 verifiers 绑定,环境即 taskset

3.4 任务环境与基准

代码与终端类以 SWE-bench(★5,669)与 harbor(★4,426)为主,操作系统与浏览器类看 OSWorld(★3,099)与 BrowserGym(★1,325),工具使用类看 AgentBench(★3,675)与 tau-bench(★1,393)。完整对照与停更情况见 05 篇

四、与其他专题的关系

  • Agent 执行沙箱边界在这里 —— 那个专题讲生产上怎么隔离不可信代码,本专题讲训练时怎么大规模供给可重置的环境。同样是「一台隔离的 Linux 机器」,两种负载对它的要求几乎相反,01 篇逐条对比
  • Agent 网关 · MCP 网关:verifiers 把训练用的工具也做成 MCP Server,训练与生产因此共用同一套工具协议
  • Agent 可观测性:trace 在这里有第二重身份 —— 生产上它是排查依据,训练时它就是训练数据本身
  • Agent Infra 板块总览:本专题在整体架构中的位置

← 回到 Agent Infra 板块总览